后台经常有人问:我看中了一台迷你主机,配置还不错,但参数表里没有写 NPU。这种机器能跑本地大模型吗?是不是没有 NPU 就完全用不了?
先给一个直接的答案:能跑,但体验差距很大。 没有 NPU 的迷你主机,靠 CPU 或集成显卡也能运行大模型,只是速度、功耗和适用场景会明显受限。差距小的时候是“慢一点”,差距大的时候是“根本没法用”。
华一在这里把“没有 NPU 能不能跑”和“性能差距到底多大”两个问题拆开讲清楚。
NPU 不是运行大模型的唯一硬件。没有 NPU 的迷你主机,通常有三条路可以走。
第一条路:CPU 推理。 使用 llama.cpp、Ollama 的 CPU 模式,把模型加载到内存里,用 CPU 逐层计算。优点是兼容性最好,任何 x86 或 ARM 处理器都能跑。缺点是速度慢、功耗高。一台普通 N100 迷你主机跑 7B INT4 模型,生成速度通常只有 2 到 5 个 token 每秒,也就是每秒钟蹦出两三个汉字。日常对话勉强能用,但稍微长一点的回答就要等很久。
第二条路:集成显卡推理。 如果迷你主机搭载了 AMD Radeon 核显或 Intel Arc 核显,可以通过 OpenCL、Vulkan 或 DirectML 调用 GPU 做推理。GPU 的并行计算能力比 CPU 强得多,速度可以提升 3 到 5 倍。比如搭载 Radeon 660M 的迷你主机,跑 7B INT4 模型可以达到 12 到 18 token/s,已经接近“流畅可用”的水平。
第三条路:NPU 推理。 NPU 是专门为神经网络设计的加速单元,能效比最高。同样跑 7B 模型,NPU 的功耗可能只有 CPU 的十分之一,速度却快好几倍。但 NPU 需要软件框架适配,不是所有模型都能直接跑,兼容性不如 CPU 和 GPU。
所以“没有 NPU”不等于“没有 AI 算力”。关键是看这台迷你主机还有什么——如果它有性能不错的集成显卡和 LPDDR5 内存,跑 7B 模型完全可行;如果它只有低功耗 CPU 和单通道 DDR4 内存,那大模型体验就会非常勉强。
我用几类典型设备做了对比测试,统一跑 Qwen2.5-7B INT4 量化模型,上下文长度 8K。
| 设备类型 | 内存规格 | 7B 推理速度 | 13B 推理速度 | 整机功耗 |
|---|---|---|---|---|
| 入门级无 NPU(N100) | 16GB DDR4 单通道 | 2-4 token/s | 基本不可用 | 15-25W |
| 中端无 NPU(i5-1240P) | 16GB LPDDR5 | 5-8 token/s | 2-3 token/s | 35W |
| 中端无独立 NPU(R5-6600H + Radeon 660M) | 16GB LPDDR5 | 12-18 token/s | 4-6 token/s | 45W |
| 中端带 NPU(Ryzen AI 7 350,66TOPS) | 16GB LPDDR5x | 25-35 token/s | 8-12 token/s | 28-54W |
| 旗舰带 NPU(Ryzen AI Max 395,126TOPS) | 128GB LPDDR5x | 50+ token/s | 20+ token/s | 55-120W |
从表格可以看出来,差距非常明显。入门级无 NPU 设备跑 7B 模型只有 2-4 token/s,而中端带 NPU 设备可以达到 25-35 token/s,差距接近 10 倍。13B 模型上差距更大——无 NPU 设备基本跑不动,带 NPU 设备还能保持可用速度。
但有一个例外值得注意:中端无独立 NPU 的 R5-6600H 方案,靠 Radeon 660M 集成显卡和 LPDDR5 内存,跑出了 12-18 token/s 的成绩。 这个速度已经超过了部分低端有 NPU 但内存带宽不足的设备。说明 NPU 不是唯一决定因素,内存带宽和 GPU 性能同样关键。
很多人以为“有 NPU 就一定快”,这是个误解。NPU 的算力单位是 TOPS,但大模型推理速度不只看 TOPS,还要看内存带宽。
大模型推理的本质,是把模型参数从内存搬到计算单元做运算。如果内存带宽不够,NPU 算力再高也只能干等着数据送过来。一些低端边缘盒子标称 6TOPS NPU,但用的是 LPDDR4 内存,带宽只有 20-30GB/s,跑 7B 模型的实际速度可能只有 3-5 token/s,还不如一台配 LPDDR5 的无 NPU 迷你主机。
所以选型时不能只看“有没有 NPU”,要看“NPU 算力 + 内存带宽 + 内存容量”三者的匹配。LPDDR5 是 7B 模型流畅推理的及格线,LPDDR5X 更好。DDR4 和 LPDDR4 会在长上下文推理时成为明显瓶颈。
没有 NPU 的迷你主机不是完全不能用,关键看你的使用场景。
够用的场景:
偶尔尝鲜,一周用几次,每次问几个问题
跑 3B 以下的小模型,做简单的文本分类、摘要、翻译
作为学习工具,了解本地大模型的基本原理和部署流程
对速度不敏感,愿意等几秒到十几秒获取回答
不够用的场景:
每天高频使用,把 AI 当作生产力工具
跑 7B 以上模型,尤其是 13B 或更大
需要多用户并发或长时间连续推理
对响应速度有要求,比如代码补全、实时对话
部署在生产环境,要求 7×24 小时稳定运行
如果你属于后者,建议直接选择带 NPU 的 AI 迷你主机。多花的钱换来的是几倍的推理速度和大幅降低的功耗,长期使用体验完全不同。
预算有限、只想尝鲜: 选择 16GB LPDDR5 内存的无 NPU 迷你主机,比如搭载 AMD R5-6600H 的机型。它虽然没有独立 NPU,但集成显卡和 LPDDR5 内存可以跑出 12-18 token/s 的 7B 模型速度,日常问答和文档处理够用。华一 PB1202 就是这一类,售价 2480 元,实测 7B 模型推理速度 12-18 token/s。
日常使用、希望流畅: 选择带 NPU、内存 16GB LPDDR5x 以上的 AI 迷你主机。7B 模型速度可达 25-35 token/s,13B 模型也能跑。华一 PB13 搭载 AMD Ryzen AI 7 350,AI 综合算力 66TOPS,售价 3950 元,适合开发者和小型团队。
重度使用、跑大模型: 选择旗舰级 AI 迷你主机或 AI 工作站。华一 PB15 搭载 AMD Ryzen AI Max 395,128GB LPDDR5x 内存,AI 综合算力 126TOPS,可流畅运行 130 亿参数大模型,适合 AI 研究和生产环境部署。
如果对本地 AI 迷你主机的选型还有疑问,或需要根据具体模型需求定制配置,欢迎联系华一精品,我们提供从入门级到旗舰级的完整 AI 算力硬件方案。